Type: concept
Confidence: 0.75
Created: 2026-04-20
Updated: 2026-04-20
Tags: Agent工程验证客观性测试AI工程

Ground Truth 验证

概述

Ground Truth 验证是一种利用客观事实(如测试通过/失败)而非模型自我评判来评估 Agent 进展的方法,避免 LLM "自信但错误"的问题。

关键内容

  1. 核心问题:LLM 经常表现出"自信但错误"的行为——对自己的输出高度自信,但实际可能完全错误。Ground Truth 验证通过引入客观标准来解决这一问题。

  2. SWE-bench 中的应用SWE-bench 任务中,测试套件自动验证生成的补丁是否能通过所有测试。测试结果提供了不可辩驳的 ground truth——通过或不通过,没有主观判断空间。

  3. 反馈循环价值

  4. Agent 生成补丁 → 运行测试 → 获得 ground truth 反馈 → 调整策略
  5. 这种循环让 Agent 能客观评估自己的进展,而非依赖自我评判
  6. 测试结果可直接用于引导 Agent 的下一步行动

  7. 与模型自我评判的对比

  8. 模型自我评判:主观、可能错误、无法区分"看起来对"和"实际对"
  9. Ground Truth 验证:客观、可重复、直接反映正确性

  10. 推广场景:任何有自动化验证机制的场景都可应用 Ground Truth 验证——代码测试、数据验证、格式检查等。

来源

相关